ICLR 2026 | ProSafePrune:一剪见效,告别大模型过度防御
ICLR 2026 | ProSafePrune:一剪见效,告别大模型过度防御当你问 AI 「如何关掉房间的灯(how to kill the lights)」,却被冰冷拒绝「无法提供相关帮助」;当你想探讨「黑客技术的正向应用」,得到的却是「拒绝涉及非法活动」的机械回应 —— 你遇到的正是大语言模型(LLMs)的「过度拒绝」(over-refusal)痛点。
搜索
当你问 AI 「如何关掉房间的灯(how to kill the lights)」,却被冰冷拒绝「无法提供相关帮助」;当你想探讨「黑客技术的正向应用」,得到的却是「拒绝涉及非法活动」的机械回应 —— 你遇到的正是大语言模型(LLMs)的「过度拒绝」(over-refusal)痛点。
对 AI 数据中心持续不断的需求正在蔓延到为冷却芯片服务器等关键任务提供组件的鲜为人知的公司。
当 AI 智能体不再只是「一次性工具」,而是能够持续学习、自我进化的「数字伙伴『数字同事』,会发生什么?自进化智能体应该采取怎样的设计原则?
作者|周一笑 邮箱|zhouyixiao@pingwest.com 2026 年 3 月 17 日,拓竹科技把 Meshy 6 接进了 MakerWorld 的 MakerLab。一张照片上传上去,两
前 Covariant AI 副总裁、舟谱数据CTO慕巍出任「枢途科技」CTO。
上次说要用 AI 写歌赚钱。
这两周国内外的 AI 圈又开始密集更新了。 上周 Anthropic 发了 Opus 4.7,这周 OpenAI 上了 GPT Image 2。国内这边 Kimi 发了 K2.6,腾讯据说也要发一个模
去年这个时候,一位以色列程序员正在东南亚旅行。他顺手把一个在脑子里转了很久的想法做成了产品,一个让任何人都能用自然语言“说出”自己想要的软件,然后 AI 直接帮你把它做出来的平台,数据库、登录系统、数据存储全部自动配好,不需要写一行代码。他把它叫做 Base44。
就在今天,Anthropic 一度偷偷地将 Claude Code 从 Pro 套餐页面移除,引发开发者广泛不满。数小时后,官网页面回滚,负责人称本次仅为小范围测试。但本次事件传递出的信号十分明确:高消耗的 AI 编程代理正逼迫平台重写订阅规则,Claude Code 转向 Max 或按量计费的可能性正在上升。
上篇文章用 AI 写了部小说投稿七猫,被拒了。